AI eval ツール: W&B Weave — 実験管理の文脈を LLM に延長する
2026年3月26日
W&B Weave は、Weights & Biases が LLM / エージェント向けに提供する評価・トレーシング基盤です。`@weave.op` デコレータで関数を 1 行ラップすればトレースと評価の両方が走り、ダッシュボードに実験単位で比較できる形で残ります。本稿では ML 実験管理の文脈から Weave の立ち位置を整理し、Traces / Evaluations / Datasets / Models / Playground の使い方、最小動作例、LangSmith / Phoenix との違い、ハマりポイントまで、エンジニア視点でまとめます。
tech-blogAI evaluationWeave